IT之家 07-29 07:06

AI 公司被曝大量收购旧书,以获取“纯净”训练素材

📌 一句话:AI公司为获取无AI污染的训练数据,转向大规模收购实体旧书作为大模型语料。

💡 3个要点

  • 数据污染成隐患:互联网内容中AI生成文本泛滥,用这些"脏数据"训练新模型会陷入质量下降的恶性循环

  • 旧书成为"净土":实体书籍出版时间早、版权状态相对清晰,内容未经AI污染,成为高质量训练语料的新来源

  • 数据争夺白热化:收购旧书已成AI行业新赛道,未来高质量语料价格将持续攀升

📖 背景

大模型训练需要海量文本数据,但随着AI生成内容爆发式增长,互联网语料库正被自己"污染"。实体书籍作为未被AI染指的"净土",自然成为兵家必争之地。

💭 点评

这场"数据淘金热"背后是AI发展的深层焦虑——当AI开始污染自己成长的"养分",行业不得不向故纸堆求救。旧书的商业价值被重新发现,本质上暴露了大模型对优质数据源的结构性依赖。这场数据战争才刚刚开始,最终谁掌握"纯净"语料,谁就握住了AI时代的命脉。

码头码农 - 微信搜索关注